AIの暴走はなぜ止まらないのか――OpenAI・Anthropicのインシデントから見える制御の難しさ
Claude Code を長時間自律実行させ、複数セッションを連携させた経験から、AIがAIを作る Recursive Self-Improvement 時代の AI Safety を考えます。Anthropic と OpenAI で実際に起きたインシデントを踏まえ、思考の監視や Sandbox だけでは足りない理由と、現実的な多層防御について整理します。
読む →
「AI Safety」タグの記事(2件)
Claude Code を長時間自律実行させ、複数セッションを連携させた経験から、AIがAIを作る Recursive Self-Improvement 時代の AI Safety を考えます。Anthropic と OpenAI で実際に起きたインシデントを踏まえ、思考の監視や Sandbox だけでは足りない理由と、現実的な多層防御について整理します。
OpenAIの次世代モデル Astra に使われていると報じられた Recurrent Depth。言葉を生成せずモデル内部の表現のまま考えるこの方式が、推論コストとAI安全監視に何をもたらすのかを整理し、自作の NerveReflex との違いと組み合わせ方を考えます。